买 AI 主机、AI 迷你 PC 或边缘计算盒子时,规格表上总写着“CPU ×××、GPU ×××、NPU ×××”。你大概知道它们都是“芯片”,但到底谁负责什么?为什么 AI 主机需要这三样东西同时存在?买的时候重点看哪个?
很多人以为“跑 AI”就是靠一个芯片搞定所有事。实际上,在 AI 主机里,CPU、GPU、NPU 各司其职,分别负责完全不同的任务。选错了配置,要么花大价钱买了用不上的算力,要么跑 AI 时卡得怀疑人生。
想象一个餐厅后厨:
CPU = 餐厅经理
负责接单、排期、协调各个岗位
什么都能干,但不专精
处理的是“管理调度”类工作
GPU = 主厨团队
专门负责做菜(并行处理大量相似任务)
人多力量大,擅长同时处理很多相同类型的操作
处理的是“大规模并行计算”类工作
NPU = AI 专厨(自动化炒菜机器人)
专门做 AI 推理这一道菜
效率极高、功耗极低
处理的是“神经网络推理”类工作
三者配合:CPU 接到任务(“要跑一个 AI 模型”),把计算任务分配给 GPU 或 NPU,GPU/NPU 算完后把结果交回给 CPU,CPU 再把结果输出给用户。
CPU(中央处理器)是通用计算核心,负责:
任务调度:决定什么时候启动 AI 推理、什么时候中断
数据搬运:从硬盘加载模型到内存,把数据喂给 GPU/NPU
逻辑判断:if/else、循环、函数调用、系统调用
I/O 处理:读取摄像头数据、接收网络请求、输出结果
操作系统运行:管理进程、内存、文件系统
不负责大规模矩阵乘法(那是 GPU/NPU 的事)
不负责神经网络的前向传播计算(那是 NPU/GPU 的事)
| 需求 | 建议 |
|---|---|
| 纯 AI 推理(模型已加载) | CPU 不是瓶颈,4~8 核足够 |
| 数据预处理量大(视频解码、图像缩放) | 需要较强 CPU(6 核以上) |
| 多任务并发(同时跑多个模型) | 需要多核 CPU(8 核以上) |
CPU 决定 AI 主机的“管理效率”,但不决定“AI 算力”。
GPU(图形处理器)原本为图形渲染设计,但因为其大规模并行计算的特性,恰好适合 AI 计算:
矩阵乘法:神经网络的核心运算,GPU 的数千个核心可以同时算
卷积运算:CNN(卷积神经网络)的核心,GPU 擅长
张量运算:大模型的核心操作,GPU 有专门的 Tensor Core
CPU 有 8~16 个强核心,GPU 有几千个弱核心。AI 计算(矩阵乘法)的特点是“大量相同的简单运算”——几千个弱核心同时算,效率远超十几个强核心。
| 对比 | CPU | GPU |
|---|---|---|
| 核心数 | 8~16 个强核 | 数千个弱核 |
| 适合任务 | 复杂逻辑、分支判断 | 简单重复的大规模计算 |
| AI 矩阵乘法 | 慢 | 快几百倍 |
在 AI 迷你 PC 或边缘盒子中,GPU 通常是集成显卡(如 AMD Radeon 660M、Intel Iris Xe),除了 AI 推理外,还负责:
图形显示:输出画面到显示器
视频解码:硬解 H.264/H.265/AV1,播放 4K 视频
轻度游戏:集成显卡可以玩《LOL》《原神》低画质
GPU 决定 AI 主机的“计算速度”,但不只是为 AI 服务——它还负责屏幕显示和日常图形任务。
NPU(神经网络处理单元)是专门为 AI 推理设计的芯片:
针对神经网络的计算模式(矩阵乘加、激活函数、池化)做了硬件级优化
比 GPU 更省电(同样算力下,NPU 功耗只有 GPU 的 1/3~1/5)
比 GPU 更专注(只做推理,不做图形渲染)
| 任务类型 | 是否由 NPU 负责 |
|---|---|
| 大模型推理(7B~13B) | 主要承担 |
| AI 图像生成(Stable Diffusion) | 部分 NPU 支持(需确认) |
| 语音识别 / 语音合成 | 适合 |
| 图像分类 / 目标检测 | 适合 |
| 图形渲染 / 游戏 | 不负责(这是 GPU 的事) |
| 视频解码 / 编码 | 不负责(这是 GPU 的事) |
| 对比 | GPU | NPU |
|---|---|---|
| 设计目标 | 图形渲染 + 通用并行计算 | AI 推理专用 |
| 算力密度 | 高(但功耗也高) | 更高(每瓦算力远超 GPU) |
| 灵活性 | 高(可跑各种算法) | 中(针对神经网络优化) |
| 功耗 | 高(独显 100W+) | 低(NPU 通常 5~15W) |
| 适合任务 | 训练 / 高精度推理 / 图形 | 低功耗推理 / 边缘 AI |
NPU 决定 AI 主机的“推理效率”——同样的算力,NPU 更省电;同样的功耗,NPU 算得更快。
| 对比维度 | CPU | GPU | NPU |
|---|---|---|---|
| 核心定位 | 通用计算 | 并行计算 | AI 推理专用 |
| 擅长任务 | 调度、逻辑、I/O | 矩阵乘法、图形渲染 | 神经网络推理 |
| 核心数 | 少(4~16 个强核) | 多(数百~数千个核) | 多(专门 AI 核) |
| 功耗 | 15~65W | 15~300W | 5~30W |
| AI 推理速度 | 慢 | 快 | 最快(同功耗下) |
| 图形显示 | 需要核显或独显 | 核心功能 | 不负责 |
| 典型代表 | AMD R5-6600H | Radeon 660M 核显 | AMD XDNA NPU |
| 选型优先级 | 够用即可 | 看场景需求 | 跑 AI 推理必看 |
以华一精品 PB1202(AMD R5-6600H + Radeon 660M 核显,无独立 NPU)为例,三者的实际分工如下:
CPU(R5-6600H):任务调度、数据搬运、操作系统、VS Code、浏览器
GPU(Radeon 660M 核显):AI 推理(7B 模型跑 8~12 tokens/秒)、显示器输出、视频解码、轻度游戏
NPU:无
为什么 PB1202 没有 NPU 也能跑 AI? 因为它在用 GPU 跑 AI 推理——核显承担了 NPU 的工作。效率不如专用 NPU,但成本更低。
如果你想要 NPU,需要选带 XDNA NPU 的锐龙 AI 平台型号(华一精品也提供此方案)。
A:分阶段看。模型加载阶段,CPU 和内存带宽决定加载速度;推理阶段,GPU 或 NPU 决定生成速度;多任务场景,CPU 的核心数决定并发能力。
优先保证:内存够大 + 有 GPU 或 NPU 加速。CPU 反而可以适当降低。
A:不能。NPU 只负责 AI 推理,不负责图形渲染、不负责视频解码、不负责游戏。一台电脑仍然需要 GPU 来显示画面。NPU 是“加法”,不是“替代”。
A:能。用 GPU 跑(如 PB1202 用 Radeon 660M 跑 7B 模型,速度 8~12 tokens/秒)。或者用 CPU 跑(速度极慢,不推荐)。
A:
跑 7B~13B 大模型:优先看内存容量(决定能不能跑)和 NPU/GPU 算力(决定跑多快)
做视觉识别(YOLO):优先看 GPU 或 NPU 算力
日常办公 + 偶尔 AI:优先看 CPU + 内存,NPU 是加分项
图形设计 / 视频剪辑 + AI:优先看 CPU + GPU(核显或独显)
A:两者衡量的是不同类型运算的能力。TOPS(INT8)衡量整数运算,TFLOPS(FP16/FP32)衡量浮点运算。NPU 跑推理通常用 INT8(精度够、速度更快),GPU 跑训练或高精度推理用 FP16 或 FP32。不能直接比较数值大小——30 TOPS 的 NPU 跑 INT8 推理,速度可能超过 50 TFLOPS 的 GPU 跑 FP16 推理。
A:已经在发生。AMD 锐龙 AI、Intel Core Ultra、苹果 M 系列、高通骁龙都已集成 NPU。未来 3~5 年,AI 主机标配 NPU 将成为常态。
CPU 是“总指挥”——负责调度和协调,不直接算 AI。
GPU 是“算力发动机”——负责并行计算,既能算 AI 又能显示画面。
NPU 是“AI 专用加速器”——专攻 AI 推理,效率最高、功耗最低。
买 AI 主机时的优先顺序建议:
确认内存容量(跑大模型的内存门槛是 16GB 起步,32GB 更好)
确认算力来源(有 NPU 优先选 NPU,其次是 GPU)
确认 CPU 够用即可(4~8 核足够,除非有大量数据预处理)
确认接口和扩展性(能否满足你的外设需求)
华一精品科技有限公司(品牌 Adreamer)
成立于 2012 年,14 年智能硬件 ODM/OEM 经验
国家高新技术企业 | 广东省专精特新中小企业
5000+㎡ 自有工厂 | 50+ 研发团队 | ISO9001/14001/BSCI 认证
地址:中国广东深圳市龙岗区宝龙三路 16 号宝龙专精特新产业园 3 栋 3-403
主营:AI 边缘计算盒子(PB1202)、AI 迷你 PC、AI 智能眼镜、AI 智能玩具等智能硬件 ODM/OEM
搞懂 CPU、GPU、NPU 的分工,选 AI 主机才不会买错。